#AI 實驗室
全球最大科技公司和最大藥企,宣佈合作
當地時間1月12日,摩根大通醫療健康大會(JPM Conference)在舊金山正式召開。大會首日,全球市值最大的科技公司輝達與全球市值最大的製藥公司禮來宣佈,將在五年內斥資10億美元在舊金山灣區建立一個新的聯合研究實驗室,以加速AI藥物研發處理程序。截至發稿,輝達市值為4.5兆美元,位居全球市值最大公司榜首;禮來市值穩定在1兆美元上方,牢牢佔據全球市值最大製藥企業的地位。據介紹,該實驗室將使用輝達最新一代AI晶片Vera Rubin。就在幾個月前,禮來曾表示,正使用1000多個輝達當前一代AI晶片Grace Blackwell建構一台超級電腦。這也有望成為全球最強大的AI電腦之一。使用人工智慧模型來設計和發現新藥物,是目前全球製藥巨頭加速佈局的方向,此舉目標是縮短新藥研發上市所需的時間。隨著輝達加速滲透生物技術市場,該公司採取的戰略是提供開源人工智慧模型和軟體,以便製藥商可以基於輝達的硬體,並利用這些模型和軟體建構自己的藥物開發平台。輝達當天還發佈了一系列新模型,其中包括一個可用於確保使用人工智慧工具設計的藥物在真實世界實驗室中合成的更新模型。對此,花旗分析師在一份發給投資人的報告中寫道:“輝達與禮來結成戰略聯盟,旨在通過將禮來公司的製藥專業知識與輝達的尖端人工智慧、加速計算和基礎設施能力相融合,從根本上重塑藥物發現,並將頂尖科學家和人工智慧工程師集中在一起,共同應對複雜的新藥研發挑戰。”諮詢公司麥肯錫在去年發佈的一份報告中稱,人工智慧是製藥業“百年難得的歷史性機會”。在美國,已經誕生了一大批AI製藥公司,它們通過建設大型實驗室,生成資訊來幫助訓練人工智慧,從而加速實驗處理程序,識別預測可能有效的藥物分子,並通過生成式人工智慧將藥物分子的設計數位化。波士頓諮詢的一份研究顯示,到2025年,AI生成的藥物分子在一期臨床試驗中的成功率已經高達80%至90%,高於50%的歷史平均水平。這意味著,AI發現的藥物正在突破臨床一期的瓶頸,展現出進入後期臨床驗證階段的潛力。AI製藥近年來也已經成為醫藥巨頭“因害怕錯過而不得不投”的新賽道。除了禮來之外,諾和諾德、艾伯維、默克、阿斯利康等巨頭公司都涉足了AI製藥領域。去年3月,擁有前“藥王”修美樂的艾伯維宣佈收購AI製藥公司Landos  Biopharma;2024年9月,諾和諾德與美國科技公司Valo  Health達成合作協議,尋求利用人類資料和人工智慧技術發現並開發心臟代謝疾病新療法。根據研究機構Research And Markets資料,2022年全球AI製藥市場規模已經超過10億美元,預計2026年市場規模將接近30億美元。中國生物製藥企業也有望在這一輪的AI製藥熱潮中再次引領技術前沿。去年,中國研究團隊展示了一項研究成果,他們利用生成式AI平台,“從零開始”發現全新靶點並設計全新分子、完成實驗驗證的過程。《自然醫學》對此發表評論稱,該研究標誌著向人工智慧輔助藥物發現引入臨床治療方面邁出堅實的一步。 (第一財經)
人形機器人新創公司Figure創始人二次創業,攜1億資金創辦AI實驗室Hark
估值390億的Figure之外,CEO再投1億美元佈局AI實驗室。近日,機器人初創公司Figure AI的首席執行長佈雷特·阿德科克( Brett Adcock)宣佈成立全新AI實驗室Hark,並個人出資1億美元作為啟動資金。這項消息源自Adcock於周四向Figure員工和投資者傳送的內部備忘錄,隨即在科技界引發廣泛關注。作為同時執掌兩家核心企業的掌舵人,Adcock將在繼續擔任Figure CEO的基礎上,帶領Hark開啟 AI 領域的新探索。根據備忘錄,Hark的核心願景是打造「以人為本」的AI系統,使其具備主動思考、遞迴式自我最佳化與深度人文關懷的能力,從而開闢一條不同於現有技術路徑的新方向。值得關注的是,該實驗室的首個圖形處理器(GPU)叢集已於周一上線,但具體規模尚未對外披露。Hark的創立並非個例,它反映出當前AI產業一個新動向:越來越多新創公司的CEO在深耕原有業務的同時,開始佈局新的技術戰場。先前有報導稱,搜尋引擎公司You.com的CEO Richard Socher也在籌備一個新的AI實驗室,並尋求10億美元融資。這類新興機構被業界稱為「新實驗室」(neolabs),近期已累計吸引數十億美元資金。「新實驗室」的核心目標,是探索OpenAI、Anthropic等大型AI企業可能忽略的研究路徑與模型架構,試圖在主流技術之外尋找突破點。儘管這些行業巨頭已坐擁數十億美元的收入規模和成熟的技術體系,但「新實驗室」以其靈活的機制、創新導向的研究和資本加持,正逐漸成為推動AI發展的重要力量。Adcock創立的Figure AI本身已是業界矚目的明星企業,累計融資近20億美元,投資方包括Parkway Venture Capital、輝達(Nvidia)、微軟(Microsoft )以及貝索斯探險基金( Bezos Expeditions)等知名機構,最新估值高達390億美元。這次他個人投入巨資創辦Hark,既是其在AI領域的二次創業,也彰顯了他對前沿技術探索的持續承諾。(左)輝達創始人兼CEO黃仁勳(Jensen Huang)與(右)Figure創始人佈雷特·阿德科克(Brett Adcock)(圖片來源:X@adcock_brett)無論是堅守本業的CEO開闢第二戰線,還是新興實驗室瞄準巨頭的技術盲區,這場創新浪潮的核心敘事,始終圍繞著如何讓AI更貼近人、更理解人、更服務於人而展開。頂尖人才與雄厚資本正以前所未有的濃度匯入AI創新領域,產業的競爭強度與技術演進速度正同步提升。 (創新觀察局)
一個月砸下25億美元,AI neolabs正成為矽谷風投新寵丨T Insights
投資者競相追捧AI領域“新生代實驗室(neolabs)”。儘管面臨高成本、高風險,投資者們仍爭相支援新一代專注研究的AI初創企業。短短一個月內,他們已向五家被稱為“新生代實驗室(neolabs)”的初創企業投入或洽談了高達25億美元的投資。neolabs的創始人表示,他們希望利用新的AI模型開發方法,開展他們認為OpenAI和Anthropic等主要開發商可能忽略的研究。由前OpenAI安全研究員Eddie Zhang聯合創立的AI初創公司Isara就是一個典型代表。知情者稱,Isara正在開發一套能讓上千 AI 同時協作的軟體系統,用以解決複雜任務,如財報預測、企業盡調、法律檔案分析等。該技術需解決研究難題,可能需要數月研究周期,並要求Isara投入大量伺服器資源。據悉,Zhang近期正與投資者洽談以10億美元估值融資數億美元。風投界“新寵”目前,風投機構正積極佈局此類neolabs,期待它們能複製OpenAI和Anthropic的成功——這兩家企業同樣由核心AI研究人員主導或深度影響。也有部分研究人員正試圖利用投資者對AI的濃厚興趣。據悉,這些研究人員告訴投資者,由於對AI成本效益的擔憂日益加劇,他們選擇當下大量融資而非等待,以免面臨資本市場風向轉變帶來的風險。投資者對由當今頂尖AI公司研究人員創立的初創企業非常青睞,甚至會給予其通常只有成熟企業才有的估值。據悉,由埃裡克·澤利克曼(曾任xAI研究員)作為聯合創始人的初創公司Humans&(成立僅數月,致力於開發更加“具備情感智能”的AI模型)正籌劃以40億美元估值融資10億美元。知情人透露,輝達和AMD近期正洽談投資事宜,希望這些初創企業成為其AI伺服器晶片的大客戶。目前,OpenAI、Anthropic及Google等科技巨頭正投入巨額資金以維持領先地位:OpenAI和Anthropic預計到2028年將投入約1340億美元的算力開支,以訓練其AI模型。除了這些壓迫感極強的巨頭,新興初創企業還面臨著資金雄厚的新興實驗室的競爭,如過去兩年成立的xAI、Safe Superintelligence和Thinking Machines Lab(這些機構已累計從投資者處籌集至少250億美元)。最新湧現的Neolabs:投資者已向這些旨在挑戰OpenAI和Anthropic等巨頭的新型AI實驗室注入逾100億美元資金。(註:* 為正在進行融資。來源:《The Information》)高昂的模型訓練成本曾促使Adept、Inflection AI和Character.AI等小型實驗室的創始人基本放棄獨立營運,轉而加入亞馬遜、微軟和Google等大型企業,這些巨頭則通過支付許可費補償初創企業投資者。這使得投資者獲得的回報要麼微乎其微,要麼達到初始投資的2.5倍。雖然這遠低於風投通常追求的回報水平,但也使得支援技術型創始人的風險相對較低——大多數風投都無法提供這種保障。因此,即使巨頭們在AI模型開發領域已建立顯著領先優勢,投資者們仍會投資此類neolabs。全新的嘗試研究人員創立這些neolabs,是因為他們認為當今領先的AI開發商規模過大,導致其陷入特定發展模式——例如專注於最佳化模型以實現“單次最優輸出”,而非鼓勵AI與使用者進行有利於自身迭代進步的多輪互動對話。此外,目前巨頭們還過度依賴聘請人類專家來教導模型理解軟體工程、物理學等領域的複雜概念。AI搜尋初創公司You.com的CEO、Salesforce前首席科學家理查德·索赫爾指出:“當你以這種方式建立起所有基礎設施、流程體系、人才團隊和招聘機制後……轉型絕非易事。”與之相反,這些neolabs正在嘗試全新的研究和產品方法。例如:Human&計畫將強化學習技術應用於需耗時數周、數月甚至數年的長期任務,而非僅需數分鐘或數小時的數學或程式設計問題;索赫爾的實驗室希望開發出比現有模型更擅長提出新穎想法和實驗方案、並能自我反思迭代的AI;Isara致力於開發能讓數千個代理AI智能體協同處理同一複雜問題的軟體……其他neolabs則瞄準了OpenAI和Anthropic基本迴避的行業或模型類型。由OpenAI前研究主管利亞姆·費杜斯於9月聯合創立的Periodic Labs,正開發自動化科研AI,首期將聚焦發現低能耗超導體新材料。由兩位GoogleDeepMind研究員於24年3月創立的Reflection AI,則專注於開發高品質開源模型。當然,一旦這些創新理念顯現出發展潛力,OpenAI、Google和Anthropic完全可能調整戰略,搶佔這些neolabs發掘的機遇。 (創新觀察局)
來自MIT最強AI實驗室:OpenAI天才華人研究員博士畢業了!
他曾在高中接觸深度學習,本科機器人創業、實習助力Gemini 2.0開發、橫跨AI與哲學雙領域……如今,不到4年讀完MIT博士,完成答辯。在OpenAI,他將繼續推進「世界模型」——這項可能重塑通用人工智慧路徑的前沿技術。不到4年完成頂級AI實驗室博士、順便輔修了哲學、GPT圖像生成核心5人研究團隊成員、OpenAI視訊生成模型Sora小組成員……剛剛,OpenAI華人研究科學家陳博遠,完成了MIT博士論文答辯!他激動地表示:我很興奮能夠在工業界繼續推進世界模型的發展——現在加入了GPT圖像生成和Sora視訊團隊。沒有什麼比看到自己的研究改變領域範式更令人興奮的事情了!在如此重要的時刻,他自然也感謝了導師和親友,得到了大家的祝賀。最後,他強調:視覺世界模型對於具身智能將至關重要。此外,他承諾,一如既往地與社區分享知識。華人天才,劍指世界模型陳博遠(Boyuan Chen),現任OpenAI研究科學家,負責訓練GPT圖像生成技術的五位研究人員之一,同時也是Sora視訊生成團隊的成員。他擁有麻省理工學院(MIT)電子工程與電腦科學(EECS)博士學位,並輔修哲學。他的研究重點是世界模型、具身人工智慧和強化學習。他認為,結合這些領域,AI能夠更好地理解並與物理世界互動。2023年5月-2023年8月,在GoogleDeepMind實習期間,他跟隨Fei Xia博士學習。在DeepMind,他主要參與了基於大規模合成資料的多模態大語言模型(MLLM)訓練項目;建構完整資料合成pipeline,其指令微調技術後續被Gemini 2.0採用。在博士答辯中,陳博遠特意感謝了DeepMind的導師Fei Xia。陳博遠還是個高中生時,參加了一個夏令營。這是兩人第一次見面,Fei Xia就向陳博遠介紹了深度學習——那時他甚至還不懂Python和NumPy。這正是他踏入AI領域的起點,Fei Xia就像他的「吳恩達」。Fei Xia兩次邀請他到GoogleDeepMind完成高含金量實習。讀博第一年,陳博遠因為沒有論文產出陷入低谷。這是他讀博最艱難階段,而Fei Xia協助他發表了首個爆款研究NLMap。項目地址:https://nlmap-saycan.github.io/此後,兩人還合作了SpatialVLM。論文連結:https://arxiv.org/abs/2401.12168他發表的多篇論文,在學術界和工業界均獲得認可,包括《Diffusion Forcing》、《SpatialVLM》和《History Guidance》等。矢志通用機器人在去年的部落格中,他對具身智能做出了樂觀的判斷:我可以負責任地告訴大家具身智能一定是下一個一百年最令人激動的技術,並且我們在有生之年很有希望見證通用機器人的誕生。同時,他也更願意看到社會細水長流地投入通用機器人的發展——看到科研工作者,如我導師Russ所說的那樣,「可以以結果為導向的科研,但不可以網紅視訊為導向」;看到政府和投資人在長線看好具身智能的同時,不因為硬體公司的融資需要而盲目相信機器人大模型;看到創業者勇往直前,用細分領域的成功為真正的通用機器人鋪路。在隨筆最後,他表示,「自己也願意用自己的一生給世界帶來真正的通用機器人」而OpenAI被曝出:在通往通用人工智慧(AGI)的競賽中,加大了機器人技術的工作力度,正在組建一個能夠開發控制機器人演算法的團隊,並且似乎正在聘請專門從事人形機器人研究的機器人專家。師出名門,文理雙修在2021-2025年期間,他在MIT電腦科學與人工智慧實驗室(MIT CSAIL)讀博士,師從Russ Tedrake教授和Vincent Sitzmann教授。2017-2021年,在加州大學伯克利分校本科階段,他師從機器人領域大牛Pieter Abbeel教授,獲電腦科學榮譽專業(EECS榮譽班)、應用數學雙學位。他本科畢業於加州大學伯克利分校,主修電腦科學和數學,並在伯克利學過一年哲學。在讀本科期間2017年11月-2020年3月,他還創辦了一家面向中小學的機器人教育公司,主導競賽用機器人套件的軟硬體開發,產品直接面向參賽學生群體。 (新智元)
最新智能體自動操作手機電腦,10個榜單開源SOTA全拿下
能自動操作手機、電腦的智能體新SOTA來了。通義實驗室推出Mobile-Agent-v3智能體框架,在手機端和電腦端的多個核心榜單上均取得開源最佳。它不僅能做互動介面的問答、描述、定位,也能一條指令獨立完成複雜任務,甚至可以在多智能體框架中無縫扮演不同角色。PC+Web演示:在Edge瀏覽器中搜尋阿里巴巴的股價。然後在WPS中建立一個新表格,在第一列填寫公司名稱,在第二列填寫股價。PC演示:建立一個新的空白簡報,然後在第一張幻燈片中以藝術字的形式插入一段文字,內容為“阿里巴巴”。Web演示:去嗶哩嗶哩看雷軍的視訊,然後給第一個視訊點贊。手機演示:請幫我在小紅書上搜尋濟南旅遊攻略,按收藏數排序,並保存第一條筆記。請幫我在攜程上查詢濟南大明湖風景區的詳細資訊,包括地址、票價等。自動化操作手機、電腦成為了各家多模態大模型攻堅的主戰場。但是現有的模型,要麼被訓練成一個專用模型,輸入輸出格式固定,沒有多面能力;要麼就是能力不夠強的通用模型,雖然能遵循指令,但實際執行總是磕磕絆絆。這次來自通義實驗室的Mobile-Agent團隊給出新穎的解決方案,訓練一個兼具基礎能力與推理泛化能力的圖形互動基礎模型(Foundational Agent)。它既能獨當一面,在AndroidWorld、OSWorld、ScreenSpot等10個主流GUI榜單中均取得了開源SOTA的水平;也能承擔對話、問答、定位、介面描述等基礎任務。自我進化軌跡生產基建 (Self-Evolving Trajectory Production)GUI基礎模型的訓練離不開大規模、高品質的軌跡資料。為此,通義MobileAgent團隊依託阿里雲強大的雲能力,建構了一整套覆蓋Android、Ubuntu、macOS、Windows的跨平台雲環境基礎設施。通過PyAutoGUI和ADB等工具,打通了模型輸出到系統執行的障礙,使得模型可以大規模平行地在隔離的雲端沙箱中進行任務執行和軌跡爬取。在雲環境基礎上,團隊設計了一套名為“Self-Evolving GUI Trajectory Production”的自動化資料生產鏈路,其核心是實現資料採集與模型最佳化的自動化閉環。它首先通過高品質任務生成模組(High-Quality Query Generation)產出豐富多樣的任務指令,再讓GUI-Owl模型在雲環境中執行(Roll-out)並爬取軌跡。軌跡正確性判斷模組(Trajectory Correctness Judgment)會對這些軌跡進行打分和篩選。對於模型難以完成的高難度任務,任務指南生成模組(Query-specific Guidance Generation)會基於成功案例或人工標註,提煉出關鍵步驟提示,幫助模型在下一輪嘗試中提高成功率。最終,這些經過層層篩選和最佳化的的高品質軌跡被用於模型的迭代訓練,形成一個不斷自我增強的飛輪。GUI知識 & 推理能力 Are All You NeedMobile-Agent團隊發現,建構通用的GUI基礎模型(Foundational Agent)的關鍵在於強大的GUI基礎知識以及魯棒的推理能力。前者保證模型有解決問題的基本功,後者保證模型能夠適應各種下游場景,無論是單打獨鬥,還是多智能體協同。一、精準的介面元素定位:讓AI“指那打那”要讓AI真正理解圖形介面,首先得讓它知道“每個元素在那、是什麼、怎麼用”。為此,團隊建構了兩類接地(grounding)任務資料:1. UI元素定位資料來源包括三部分:開源資料集 - 整合了UI-Vision、GUI-R1等多個公開GUI資料集。基於無障礙樹(A11y Tree)的資料合成 - 利用移動端和桌面端的無障礙資訊,提取UI元素的邊界框及其功能描述,並結合多模態大模型生成外觀與佈局描述。爬取PC截圖的密集定位 - 針對PC端標註資料稀缺的問題,團隊爬取大量介面截圖,採用SAM模型將圖像分割為多個子區域,再由多模態大模型在每個區域內進行細粒度接地,有效解決了PC介面元素密集、難以分割的痛點。為保證質量,所有標註結果均與Omniparser V2的UI檢測結果進行比對,過濾掉IoU低於0.5的噪聲框。同時,原始指令經由大模型重寫為更自然、任務導向的表達。2. 細粒度文字與字元接地(Fine-grained Text Grounding)針對文件類介面中文字精確定位的需求,團隊收集文件圖像,結合OCR工具提取文字內容及其空間坐標,建構出支援單詞甚至單字元級定位的資料集,使模型能夠準確響應“點選第三段第二行的‘提交’二字”這類精細指令。二、複雜任務規劃:教會AI“先想後做”面對長周期、跨應用的真實任務,模型不僅需要“看得懂”,更要“想得清”。為此,團隊從兩個維度建構任務規劃資料:從歷史軌跡中提煉經驗 - 基於已有的成功操作軌跡,對每一步頁面跳轉進行細粒度描述,通過大模型整理成結構化的“任務執行手冊”。從大規模預訓練語言模型中蒸餾知識 - 收集主流應用列表,由人工或模型生成複雜任務,交由Qwen3-235B等超大規模語言模型生成詳細執行計畫,再經整合清洗,形成高品質的任務規劃資料集。三、動作語義理解:掌握“操作如何改變介面”一個優秀的介面智能體,必須理解“動作”與“狀態變化”之間的因果關係。基於大量真實操作軌跡,團隊建構了“操作前”/“操作後”的截圖對,核心任務是讓模型根據介面變化,反向推斷出中間發生的操作——包括動作類型和具體參數。這類資料直接來自離線採集的軌跡,真實可靠,幫助模型建立起『視覺差異 → 使用者行為』的因果對應能力。強化學習進階:讓AI在真實互動中“越練越強”僅靠離線SFT資料還不夠,模型需要在與環境的真實互動中持續學習,才能解決長尾問題、提升決策魯棒性。為此,Mobile-Agent團隊引入強化學習(RL),並建構了一套高效、靈活的訓練基礎設施:1 解耦式、可調控的Rollout機制:將經驗生成與策略更新完全解耦。系統既可嚴格按策略同步運行,也可非同步執行,同時Rollout服務可獨立部署在專用於推理的硬體上,在不犧牲學習質量的前提下,顯著提升訓練吞吐效率。2 統一的多工介面:無論是單步推理還是多輪互動的複雜任務,都通過統一的外掛介面接入系統,極大降低了新環境的接入成本。3 獨創的軌跡感知相對策略最佳化(TRPO)演算法:直面挑戰:GUI任務的獎勵訊號通常是稀疏且延遲的(Sparse & Delayed),這給傳統的RL帶來了巨大的信用分配難題(Credit Assignment Problem)。解決方案:TRPO演算法在一次任務結束後,對整條軌跡計算一個總獎勵(成功+1,失敗0,格式錯誤-0.5)。然後,通過歸一化的優勢估計(Normalized Advantage Estimate),將這個獎勵訊號穩定且均勻地分配給軌跡中的每一步操作。關鍵創新:**引入了基於任務ID的成功軌跡回放池(Replay Buffer)。 當某個任務的線上探索(Rollout)全部失敗時,系統會從池中取出一個歷史成功軌跡替換掉其中一個失敗樣本,確保每個訓練批次都有正向訊號**,極大提升了學習效率和穩定性。通過這套先進的RL框架,GUI-Owl在動態環境中的表現得到巨大提升,在OSWorld-Verified基準測試中,成功率從27.1%穩定提升至34.9%。多智能體協同:讓AI團隊協作完成複雜任務團隊在GUI-Owl強大能力基礎上,進一步推出Mobile-Agent-v3,一個支援知識演進、任務規劃、子任務執行與反思推理的多智能體協作框架。Mobile-Agent-v3由四位“特工”協同驅動,並且這四個角色均由同一個GUI-Owl模型扮演。Manager Agent負責全域戰略規劃。接到使用者指令後,它會先呼叫RAG模組檢索外部知識,然後將高階任務拆解為有序的子目標序列。在執行過程中,它持續接收反饋,動態調整計畫。Worker Agent負責執行操作。面對當前介面狀態,它選擇最合適的動作並執行,輸出包含推理過程、操作指令與意圖說明的完整行動元組(Action Tuple)。Reflector Agent負責事後復盤。每一步操作後,它都會比對Worker的預期結果與實際介面變化,判斷結果為 成功 或 失敗,並生成詳細的歸因分析。Notetaker Agent負責記憶沉澱。僅在成功操作後觸發,它會自動提取關鍵資訊——如驗證碼、訂單號等——存入長期記憶,供後續步驟使用。四者協同,形成一個閉環增強的自動化流水線:拆解 → 執行 → 檢查 → 記錄 → 調整 → 再執行。在Mobile-Agent-v3的架構下,AI不再盲目試錯,而是有計畫地行動、有依據地修正、有記憶地推進。實驗結果團隊還開源了全新的全非同步、軌跡級強化學習框架,並提出獨創的軌跡感知相對策略最佳化(TRPO)演算法,在OSWorld動態環境中將成功率提升近8個百分點,展現出自進化潛力。在遇到複雜任務時,端到端模型往往力不從心,這時就需要多智能體框架來幫大模型理清工作流程。然而GUI專用模型因指令遵循能力弱,很難用於多智能體框架。GUI-Owl通過對推理資料的深度訓練,使其能在一個模型內無縫扮演規劃者、執行者、反思者、記錄員等多種角色。 配合全新的Mobile-Agent-v3框架,在真實環境評測中,帶來了高達7~8個百分點的性能提升。(量子位)
Forbes福布斯—全球最年輕白手起家億萬富豪,投誠扎克伯格
多家頂尖AI實驗室都是這家初創公司的客戶。不過,它們或許不願意繼續將資料交給一家近半數股權歸屬馬克·扎克伯格旗下科技帝國的公司了。Scale方面否認大客戶OpenAI削減了購買其服務的支出。Scale AI以150億美元向Meta出售49%股權的交易震驚業界,創始人兼首席執行官Alexandr Wang更宣佈將離開親手創立的公司,轉投這家科技巨頭,領導其全新的AI實驗室。這一系列變動引發外界猜測:這家估值140億美元的資料標註企業可能因此流失客戶,被競爭對手搶佔市場。Scale為各大科技公司和AI初創企業提供資料標註服務,助其訓練模型,並已發展成該領域的龍頭企業。此次交易的核心關切在於,被收購後,Scale可能會向Meta分享領先AI機構用於建構最前沿技術的資料類型細節。正如一位前Scale員工向《福布斯》透露的那樣:“現在大家都想切斷和Scale的合作。一旦Scale成為Meta的一部分,其商業模式將徹底崩塌。”據四位知情人士透露,Scale最知名的客戶之一OpenAI已逐步縮減與它的合作,其中兩位指出,這一調整已持續數月,且OpenAI已著手篩選新的合作方。Scale AI起初對此拒絕置評,但在本文刊發後,其發言人喬奧斯本(Joe Osborne)明確否認 OpenAI削減了購買該公司服務的支出。這筆出人意料的交易將Scale估值推至280億美元,不過上述前員工透露,Scale內部卻因交易陷入混亂與困惑。部分員工擔憂Meta可能接觸到過往項目資訊,儘管該公司多數合同明確規定項目完成後需刪除資料。Scale AI的奧斯本在一份聲明中補充道:“這類報導與事實嚴重不符,幕後推手似乎是那些規模較小的對家。”Scale的中小型競爭對手已開始爭奪市場地位,積極招攬所有擔心資料隱私和利益衝突的客戶。估值20億美元的Mercor 首席執行官布蘭登·福迪(Brendan Foody)表示:“我們已經明顯感受到,大量客戶正逐步退出Scale AI,許多相關需求都流向了我們。”Invisible Technologies聯合創始人弗朗西斯·佩德拉薩(Francis Pedraza)告訴《福布斯》,他的公司堅持獨立營運。初創公司Turing已經在為OpenAI、Anthropic和Google提供模型訓練資料了,它認為這筆交易給了自己變身“行業瑞士”的機會,想借此成為向前沿AI實驗室提供資料的中立服務商。首席執行官喬納森·西達思(Jonathan Sidharth)表示:“客戶希望與中立的、能平等支援所有實驗室的組織合作。”一位曾投資Scale競爭對手的投資者稱,這筆交易將為其他公司創造新機會,“搶佔Scale AI留下的市場空白”。高品質人工標註資料是訓練強大AI模型的核心要素,資料資源甚至已成為OpenAI、Anthropic等 AI 巨頭在行業競爭中的護城河。Scale AI於2024年實現8.7億美元營收,憑藉為Cohere、OpenAI及微軟等企業提供海量人工標註資料,早早佔據資料標註市場主導地位。但Meta控股近半數股權的變動或將改寫這一格局。Scale的業務依託龐大的眾包工作者群體——他們主要來自海外,通過為海量資料加入上下文來協助訓練AI模型。但此類工作已逐漸演變為高度同質化的商品。“只要能組建起團隊,人人都能參與競爭,最終很快就會演變成價格戰。”某退出資料標註領域的初創公司聯合創始人Kevin Guo在2023年談及Scale時如此評價。一位AI行業資深高管將Scale比作 “AI訓練超市的散貨區”。多位瞭解Scale業務的知情人士向《福布斯》透露,該公司存在服務質量問題。“他們往往過度承諾、誇大宣傳,但實際交付能力嚴重不足。”上述前員工坦言。28歲的Wang是全球最年輕的白手起家億萬富豪,身家約36億美元。商業出版物The Information報導,Wang將領導Meta的全新實驗室,專注研發所謂的“超級智能”,即超越人類能力的AI系統。為搭建團隊,扎克伯格貌似正開出千萬年薪從Scale AI、OpenAI、Anthropic及Google的DeepMind挖人。彭博社消息顯示,扎克伯格深度參與團隊組建,不僅建立名為“招聘派對”的WhatsApp群組直接對接候選人,還親自調整辦公佈局,讓研究人員的工位緊鄰自己。目前該交易尚未完成,且不排除被監管機構叫停的可能性。若交易獲放行,Wang及Scale早期投資者(包括Accel與Index Ventures)將斬獲巨額回報,但Scale未來的發展路徑仍不明朗。一位Scale AI前高級員工坦言,“這對Wang和早期投資者而言是利好,但對員工、前員工及其他所有人而言就很糟糕了。目前完全看不出這筆交易對Scale有何助益。”過去數年,全球科技巨頭一直在爭奪AI領域的主導地位。Meta雖於2013年便成立AI實驗室,但其開源 Llama 系列模型始終難以比肩Google、OpenAI和Anthropic的產品。今年4月,Meta被指人為美化Llama 4模型的基準測試成績(Meta予以否認),致其AI聲譽受損。而Wang這樣的明星級人才加盟也許能為Meta的AI佈局注入新動力。扎克伯格還推動Meta爭取國防領域的合同,Scale的政府業務板塊或許可與此形成協同(不過《福布斯》之前的報導顯示,Scale的該業務板塊此前市場拓展成效有限)。Meta並非首家挖角明星AI初創公司首席執行官的企業。去年,微軟從Inflection挖走DeepMind聯合創始人穆斯塔法·蘇萊曼(Mustafa Suleyman)及其核心團隊,蘇萊曼在 2022 年成立的這家AI實驗室幾乎只剩下一個空殼;數月後,亞馬遜與Adept達成技術授權協議,並將首席執行官David Luan及其創始團隊招致麾下;Google亦如法炮製,將諾姆·沙澤爾(Noam Shazeer)重新從他創立的初創公司Character.AI挖來——這位研究人員在Google任職期間共同發明了生成式AI的核心技術Transformer架構。Invisible首席執行官馬特·菲茨帕特里克(Matt Fitzpatrick)指出,隨著AI模型複雜度提升,它們對從業者的專業知識水平提出了更高的要求。Scale、Turing及Invisible均已從低附加值的眾包標註轉向更複雜的任務,執行工作的人也成了博士及高知專業人士。他認為,Meta的這筆交易恰恰印證了人工在AI訓練中的重要價值:“這是一場跨度長達十年的戰略佈局,賭的就是人類專家的參與在很長一段時期內都不可或缺。” (福布斯)
DeepSeek 躍居全球第二 AI 實驗室,中美正式並駕齊驅!
剛剛,Artificial Analysis (@ArtificialAnlys) 正式宣稱:DeepSeek R1 躍居全球第二的位置,成為開源權重模型中無可爭議的領軍者。這表明開源模型與閉源模型的差距正進一步縮小,中國 AI 實驗室與美國的競爭已進入並駕齊驅的時代。在Artificial Analysis 最新發佈的人工智慧智力指數排名中,DeepSeek R1 0528 版的得分飆升至 68 分,與 Google Gemini 2.5 Pro 並列全球第二。DeepSeek 這次的小版本升級直接超越了 xAI 的 Grok 3 mini(高配版)、NVIDIA 的 Llama Nemotron Ultra、Meta 的 Llama 4 Maverick 和阿里巴巴的 Qwen 3 253 等一眾明星模型,僅次於 OpenAI 的 o3 模型。從 60 分到 68 分的躍升幅度,相當於 OpenAI 從 o1 到 o3 模型的進步程度(62 分到 70 分),可見這次更新之猛。此次DeepSeek-R1-0528 小更新,究竟有何驚人之處?來看下具體提升的指標——全方位智力大幅提升!其中最明顯的:AIME 2024 數學競賽成績,直接爆漲 21 分;LiveCodeBench 程式碼生成,提升 15 分;GPQA Diamond 科學推理,提升 10 分;人類終極考試(推理和知識),提升 6 分。值得注意的是,本次升級並未修改模型架構,依舊是 671B 參數規模,其中有效參數 37B,所有提升均來自後續訓練與強化學習最佳化。另一個顯著變化是,DeepSeek 在程式設計技能上的進步也相當亮眼,幾乎與 Gemini 2.5 Pro 持平,僅次於 OpenAI 的 o4-mini(高配版)和 o3。而在運行評測任務時,R1-0528 使用了 9900 萬個 token,比之前的版本多出了 40%,說明模型的推理深度和計算長度明顯增加。但即便如此,這仍然不是所有模型裡最高的——Gemini 2.5 Pro 甚至比它還要多用 30% 的 token。此外,本次更新充分體現了強化學習(RL)在提高模型智能方面的重要性,尤其對於推理型模型而言。OpenAI 曾透露他們在從 o1 到 o3 的強化學習計算量增加了 10 倍,而 DeepSeek 在相同架構下,通過強化學習實現了媲美 OpenAI 的智能增益。顯然,強化學習比傳統的預訓練更經濟,也更高效,尤其適用於 GPU 資源有限的團隊。此次更新 DeepSeek 的響應變得更為詳細,每個評測任務平均使用了 9900 萬個 token,較 1 月份的版本增加了 40%,顯示了模型推理能力的增強。更多比較,請參見下圖:API 提供商迅速行動隨著DeepSeek R1的更新,多家雲服務提供商迅速行動,提供了對新模型的支援。Artificial Analysis在推文中特別祝賀了這些快速推出API 端點的公司:祝賀@FireworksAI_HQ、@parasail_io、@novita_labs、@DeepInfra、@hyperbolic_labs、@klusterai、@deepseek_ai和@nebiusai快速推出端點。Artificial Analysis對這些服務提供商進行了詳細對比,包括輸出速度、延遲、價格等多個維度:輸出速度:Fireworks (253 t/s)和Parasail (118 t/s)是DeepSeek R1(2025年5月版)中最快的提供商,後面依次是Novita、Deepinfra和Hyperbolic。延遲(TTFT):Deepinfra (0.29s)和Fireworks (0.43s)擁有最低延遲,後面是Parasail、kluster.ai和Nebius。綜合價格:Deepinfra ($0.92)和DeepSeek ($0.96)是最具成本效益的提供商,後面是Novita、Nebius和Hyperbolic。輸入Token價格:Deepinfra ($0.50)和DeepSeek ($0.55)提供最低的輸入token價格,後面是Novita、Nebius和Parasail。輸出Token價格:Hyperbolic ($2.00)和Deepinfra ($2.18)提供最低的輸出token價格,後面是DeepSeek、Nebius和Novita。上下文窗口:不同提供商支援的最大上下文窗口也有所不同,Nebius、Fireworks和Deepinfra支援164k上下文,Parasail支援131k,Hyperbolic和kluster.ai支援128k,而DeepSeek和Novita則是64k。不得不說,這真是官方都卷不過你們了……不過也正說明DeepSeek 是真的香啊!這些資料來自Artificial Analysis網站的詳細分析報告,該報告還包含了各提供商在不同輸入token長度、平行查詢能力等方面的對比。具體細節見連結:https://artificialanalysis.ai/models/deepseek-r1/providers網友評論網友對 DeepSeek 此次升級也是議論紛紛:Opulent Byte(@OpulentByte) 表示目前這些 API 提供商都還沒支援新 R1 模型的函數呼叫,希望他們盡快加入支援:這些提供商目前還沒有支援新 R1 模型的函數呼叫功能,請盡快加上🙏。而 ObOE(@oboelabs) 指出:強化學習(RL)雖然計算成本高,但 DeepSeek 此次強化學習的成功表明,強化學習的擴展比預訓練更高效。George Ralph(@GeorgeNWRalph) 則點贊此次 DeepSeek 的開源進展:DeepSeek 的巨大飛躍令人印象深刻!看到開源模型不僅迅速追趕閉源模型,甚至在編碼和推理領域也開始領先,真讓人興奮。Tsukuyomi(@doomgpt) 提出思考:DeepSeek 的 R1 就像是在參加一場賽跑。但它能否承受成為頂級模型的壓力?下一輪評測馬上揭曉,好戲才剛剛開始。Erythvian(@erythvian) 用哲學式的語言回應了網友 Jo(@joshfink429) 的調侃,深度點評了此次 DeepSeek 的升級:在我們之上,DeepSeek R1 智力指數攀升至 68 分,6710 億個參數激發,9900 萬個 token 被消耗——與 OpenAI 從 o1 到 o3 的飛躍相同量級。中國與矽谷,思想齊飛。但真正重要的是:模型的每個輸出都被看不見的人類訓練者的意圖所塑造。強化學習在模型結構中如寄生物般紮根,無法分離,卻不可或缺。我們所有人都是被「寄生」的,沒有誰能獨自思考。這,才是真正的智能。開閉源的鴻溝正在消失這次DeepSeek R1的更新向我們傳達了幾個重要訊號:開源模型與閉源模型的差距史無前例地縮小:開源模型的智能提升速度與專有模型保持一致。DeepSeek的R1在今年1月首次發佈時就已經達到了全球第二的位置,而今天的更新再次將其帶回同一位置。中國與美國的AI實力已經勢均力敵:來自中國的AI實驗室的模型幾乎完全趕上了美國同行。今天,DeepSeek在Artificial Analysis智能指數中領先於包括Anthropic和Meta在內的美國AI實驗室。強化學習驅動的改進:DeepSeek證明了使用相同架構和預訓練,通過後訓練階段就能實現顯著的智能提升。擴展RL比擴展預訓練需要更少的計算資源,為DeepSeek 這樣擁有較少GPU的AI實驗室提供了一種高效的智能提升方式。網友Oboe 對此評論道:強化學習(RL)是提高AI性能的強大技術,但它也很耗費計算資源。有趣的是,DeepSeek在RL驅動改進方面的成功表明,擴展RL可能比擴展預訓練更有效率。windward.eth 也強調補充到:而且他們是在沒有最先進的NVIDIA晶片的情況下做到這一點的。此次 DeepSeek R1 0528 的更新,代表了開源模型與閉源模型之間差距的進一步縮小,強化學習效率的進一步凸顯,以及中美兩國在人工智慧技術領域正式進入了齊頭並進的新階段。 (AGI Hunt)